Back
精读 VLA-OPD:让学生 VLA 在自己走出的状态上接受教师的 token-level dense supervision,并用 Reverse-KL 同时获得 SFT 的效率与 RL 的闭环鲁棒性。
paper deep dive
vla
on-policy distillation
robot post-training